1
Introduzione alla Visione Artificiale e all'Elaborazione Digitale delle Immagini
PolyU COMP5511Lecture 8
00:00

Introduzione alla Visione Artificiale e all'Elaborazione Digitale delle Immagini

La Visione Artificiale è il campo dell'intelligenza artificiale che consente ai computer di estrarre informazioni significative da immagini e video digitali, cercando di colmare il divario semantico tra i dati grezzi dei pixel e la comprensione a livello umano. L'Elaborazione Digitale delle Immagini funge da livello fondamentale per la Visione Artificiale, concentrandosi sulla manipolazione e sul miglioramento dei segnali immagine attraverso trasformazioni pixel-pixel per preparare i dati ad attività interpretative di livello superiore.

Principi Chiave

  • Rappresentazione dei Dati: A livello macchina, un'immagine è un tensore numericizzato, non un'immagine olistica. Le immagini in scala di grigi sono matrici 2D di valori di intensità, mentre le immagini a colori sono tensori 3D che rappresentano i canali Rosso, Verde e Blu (RGB) con dimensioni $H \times W \times 3$.
  • Trasformazione vs. Interpretazione: L'Elaborazione Digitale delle Immagini si occupa principalmente di operazioni immagine-immagine come la riduzione del rumore, la nitidezza o l'equalizzazione dell'istogramma. La Visione Artificiale si concentra su operazioni immagine-conoscenza come la classificazione degli oggetti, la localizzazione e la segmentazione.
  • Il Paradigma della Grafica Inversa: La Visione Artificiale può essere considerata come l'inverso della Computer Grafica. Mentre la grafica cerca di generare un mondo visivo a partire da modelli matematici, la visione cerca di recuperare strutture 3D ed etichette semantiche da proiezioni 2D.
La Sfida Fondamentale
La sfida principale in questo campo è il Divario Semantico, ovvero la disconnessione tra i valori di pixel di basso livello elaborati dalle macchine e i concetti di alto livello percepiti dagli esseri umani.
Implementazione Python
Domanda 1
Quale processo è classificato come operazione immagine-conoscenza?
L'Elaborazione Digitale delle Immagini
La Visione Artificiale
Computer Grafica
Equalizzazione dell'istogramma
Domanda 2
A livello macchina, qual è la struttura dati di un'immagine a colori standard?
Matrice 2D
Array 1D
Tensore 3D / Canali RGB
Lista collegata
Caso di Studio: Sistema Diagnostico Medico
Leggi lo scenario qui sotto e rispondi alle domande.
Un ospedale sta sviluppando un nuovo sistema diagnostico medico automatizzato progettato per analizzare le radiografie alla ricerca di potenziali fratture ossee. Il sistema elabora i dati grezzi dei sensori della macchina a raggi X e genera un referto diagnostico per il radiologo.
D
1. Se il sistema applica un aumento del contrasto per rendere più chiare le strutture ossee, si tratta di Elaborazione Digitale delle Immagini (DIP) o Visione Artificiale (CV)?
Risposta:
Elaborazione Digitale delle Immagini. L'aumento del contrasto è una trasformazione immagine-immagine che migliora la qualità visiva del segnale senza estrarre significato semantico.
D
2. Se il sistema segnala automaticamente un'area specifica come potenziale frattura, quale compito sta eseguendo?
Risposta:
Visione Artificiale / Rilevamento degli Oggetti. Il sistema sta interpretando il contenuto dell'immagine per estrarre conoscenza di alto livello (individuazione di una frattura).
D
3. Perché la riduzione del rumore è necessaria prima di eseguire un algoritmo di rilevamento?
Risposta:
Per migliorare la qualità del segnale e ridurre i falsi positivi nella fase di interpretazione semantica. Il rumore può essere interpretato erroneamente dagli algoritmi di CV come caratteristiche o bordi reali.